Data Domain: ARMAZENAMENTO-00009 | Proteção RAID em estado crítico
Resumo: Os sistemas Data Domain iniciarão um desligamento normal se ocorrerem várias falhas de disco e a reconstrução do RAID não puder continuar. Essa medida de proteção evita uma possível perda de dados quando a proteção RAID atinge um estado crítico. ...
Sintomas
O alerta STORAGE-00009 é acionado quando dois ou mais discos falham e a reconstrução do RAID não pode continuar, porque não há discos sobressalentes disponíveis ou porque a reconstrução foi paralisada.
- O sistema gera o código do evento:
STORAGE-00009 - A seguinte mensagem de alerta é exibida:
Two or more disks are failed and the RAID protection is in critical state for over a considerable period of time. If an additional disk fails, there might be permanent loss of data. The system will shut down. - Um grupo de discos RAID6 opera em um estado degradado com dois discos com falha.
- Nenhum disco sobressalente disponível para dar suporte à reconstrução.
- A reconstrução do RAID trava ou falha ao progredir.
- O sistema inicia um desligamento normal para proteger a integridade dos dados.
Causa
O Data Domain Operating System (DDOS) monitora continuamente a integridade do disco e o status do RAID. Quando dois ou mais discos falham e uma das seguintes condições existe, o DDOS aciona um desligamento do sistema de proteção:
- Nenhum disco sobressalente está disponível para a reconstrução do RAID.
- A reconstrução do RAID não consegue progredir dentro do espaço de tempo monitorado.
O DDOS realiza esse desligamento para evitar degradação adicional e possível perda permanente de dados que resultaria de uma falha de disco adicional no grupo de RAID já crítico.
Resolução
Medidas proativas para evitar essa condição:
- Substitua os discos com falha imediatamente. Cada disco substituído se torna um sobressalente disponível para futuras reconstruções de RAID.
- Monitore a integridade do disco regularmente e não permita que discos com falha se acumulem no sistema.
- Mantenha um inventário adequado de discos sobressalentes para que a reconstrução automática possa começar imediatamente após uma falha.
Etapas reativas quando o STORAGE-00009 é acionado:
Etapa 1 - Avalie o estado atual da proteção RAID:
-
- Faça log-in na CLI do sistema Data Domain.
- Execute os seguintes comandos para avaliar a integridade do disco e o status do RAID:
# disk show state# disk show failure-history
- Conte o número de discos em um **
Failed** e identificar quais grupos de discos são afetados. - Execute o seguinte comando para confirmar se o alerta STORAGE-00009 está ativo:
# alerts show current
- Determine a gravidade da condição:
-
Condição Nível de risco Ação recomendada O alerta STORAGE-00009 está ativo; A proteção RAID está em estado crítico Critical — o sistema pode desligar para evitar perda de dados Entre em contato imediatamente com o Dell ProSupport e comunique o estado crítico do RAID Várias falhas abrangem diferentes grupos de discos; Discos sobressalentes estão disponíveis Alto - o sistema está degradado, mas mantém a proteção RAIDEntre em contato com o Dell ProSupport e solicite a substituição acelerada do discoUm único disco falhou; A reconstrução sobressalente está em andamento Moderada - a proteção RAID6 permanece intacta Siga o processo padrão de substituição do chamado
-
Etapa 2 - Entre em contato com o Dell ProSupport:
-
- Colete as seguintes informações antes de entrar em contato com o suporte. Isso acelera o diagnóstico e a substituição:
-
INFORMAÇÕES NECESSÁRIAS: COMO OBTER: Modelo do sistema e etiqueta de serviço # system show serialnoEstados atuais do disco # disk show stateHistórico de falhas do disco # disk show failure-historyAlertas ativos, incluindo a saída STORAGE-00009 # alerts show currentModelo da unidade e versão do firmware # disk show hardwareNúmero de discos de substituição pendentes Seus registros de chamados existentes Pacote de suporte (poderá ser solicitado se uma investigação adicional for necessária) Data Domain: Como coletar um pacote de suporte do Data Domain
-
- Entre em contato com o Dell ProSupport ou com o provedor de suporte contratado e comunique claramente a situação, inclusive:
- O estado de proteção RAID (crítico, degradado ou em reconstrução).
- O número de discos com falha e grupos de discos afetados.
- Se a entrega dos discos de substituição estiver pendente.
- Colete as seguintes informações antes de entrar em contato com o suporte. Isso acelera o diagnóstico e a substituição:
Etapa 3 – Tome medidas de proteção provisórias enquanto aguarda discos de substituição:
-
- Monitore a integridade do disco executando '
disk show state' pelo menos duas vezes por dia para detectar quaisquer falhas adicionais imediatamente. - Reduza as cargas de trabalho não essenciais sempre que possível. Pause agendamentos de backup não essenciais e trabalhos de replicação para reduzir a carga de E/S em grupos de discos degradados.
- Não realize o ciclo de alimentação do sistema** a menos que o Dell ProSupport lhe dê instruções explícitas para fazê-lo.
- Se um disco adicional falhar em um grupo de discos já degradado, entre em contato imediatamente com o Suporte Dell — não espere o próximo dia útil.
- Monitore a integridade do disco executando '
Etapa 4 - Substitua os discos com falha:
-
- Substitua os discos com falha imediatamente assim que o hardware de substituição chegar. Cada disco substituído torna-se um sobressalente disponível para a reconstrução do RAID.
- Após a substituição, verifique se a reconstrução do RAID começa executando:
# disk show state
- Continue monitorando até que a reconstrução seja concluída e o
STORAGE-00009O alerta é removido.